Как антиплагиат должен проверять текст на ИИ: разбор детектора Руконтекст
Минувшей весной ложные срабатывания ИИ-детекторов на студенческих работах стали темой федеральных СМИ и обращений в Минобрнауки — и вывели в публичную плоскость вопрос, который раньше интересовал только специалистов: как вообще системы проверки распознают сгенерированный текст и почему они ошибаются.
Массовая доступность генеративных нейросетей изменила саму постановку задачи проверки текстов. Классический антиплагиат ищет заимствования — совпадения с уже опубликованными источниками. Но текст, который написал ChatGPT, ни у кого не «позаимствован»: формально он оригинален, и стандартная проверка покажет высокий процент уникальности. В поиске эту проблему называют «плагиатом на ИИ», хотя плагиатом в строгом смысле она не является: заимствовать здесь не у кого.
Поэтому у систем проверки появилась вторая задача: определять не только заимствования, но и признаки машинной генерации. Антиплагиат на искусственный интеллект — модуль, оценивающий вероятность того, что текст написан нейросетью, — сегодня есть у всех крупных игроков рынка.
Запрос на такую проверку идёт с двух сторон. Организациям — вузам, научным институтам, издательствам — нужен инструмент контроля: невозможно вручную оценить самостоятельность сотен работ и рукописей. Авторам нужна предсказуемость: понимать, как их текст увидит проверяющая система и кто принимает решение, если пометка всё-таки появилась. Эти два интереса сходятся в одном требовании к технологии — она должна быть не только чувствительной, но и осторожной.
В этом материале разбираем, как задача решена в системе Руконтекст: что умеет ИИ-детектор, где проходят границы точности любой подобной технологии и почему финальное решение всегда остаётся за человеком.
Как ИИ-детектор находит сгенерированные фрагменты
Проверка текста на генерацию ИИ строится на классификационной модели, обученной на большом размеченном корпусе: часть текстов в нём написана людьми, часть сгенерирована нейросетями. AI-детектор в антиплагиат-системе учится различать статистические паттерны, характерные для каждого класса: распределение вероятностей слов, длину и структуру предложений, частотность типовых конструкций. У генеративных моделей есть узнаваемый «стиль» — и именно он оставляет следы, которые улавливает детектор.
Результат работы модели — не бинарный вердикт «сгенерировано / написано человеком», а вероятностная оценка для каждого фрагмента документа. Это основа всей логики, к которой мы вернёмся в разделе о точности.
Детекция генерации — это гонка. Пока детектор осваивает стиль одной модели, ей на смену приходит следующая, ещё более «человечная». Каждое новое поколение языковых моделей пишет естественнее предыдущего, и статистический «почерк» нейросетей постепенно размывается. Поэтому детектор нельзя обучить один раз и навсегда: он живёт на свежих образцах генерации, а качество дообучения упирается в то, каким корпусом располагает разработчик.
Что видит пользователь: как антиплагиат показывает ИИ
Если при проверке на наличие ИИ система обнаруживает фрагменты с высокой вероятностью генерации, документ получает статус «подозрительный». В интерактивном просмотре такие фрагменты выделяются сплошным цветом с подчёркиванием: проверяющий видит не только общую долю подозрительного текста, но и — главное — конкретные места, вызвавшие срабатывание. Решение принимается по фрагментам, а не по цифре. В кратком и расширенном отчётах появляется предупреждение о возможных ИИ-фрагментах.
Система помечает фрагменты как «подозрительные», а не «сгенерированные». Это осознанный выбор: детекция генерации по своей природе вероятностна, и формулировка вердикта не должна звучать сильнее, чем позволяет технология.

Интерактивный просмотр: подозрительные фрагменты выделены в тексте, справа — постраничная детализация. Снять пометку может проверяющий
Попытки обхода тоже фиксируются
Параллельно с детекцией генерации система выявляет технические манипуляции с документом — приёмы, которыми пытаются искусственно поднять оригинальность или «сломать» проверку: замену кириллических букв на визуально идентичные латинские (гомоглифы), невидимые символы нулевой ширины внутри слов, скрытый текст белым шрифтом. Обнаружив такие манипуляции, система сообщает о них в отчёте. При этом сам документ не правится: система фиксирует находку и показывает её эксперту.
Точность: что детекторы могут, а что — нет
Ни одна система в мире не определяет генерацию со 100-процентной точностью. Это не слабость конкретного продукта, а прямое следствие устройства самой технологии.
Почему 100-процентная точность недостижима
Детектор всегда выбирает между двумя типами ошибок. Настроенный агрессивно, он поймает больше действительно сгенерированных текстов — но чаще будет помечать как машинные тексты, написанные людьми. Настроенный консервативно, он реже обвинит невиновного — но пропустит часть генерации. Эта связка — рост чувствительности неизбежно тянет за собой рост ложных срабатываний — не обходится настройками. Единственный способ сдвинуть баланс — качество базовой модели и обучающих данных.
Цена ошибки: чему научили детекторы первых поколений
Известный пример — собственный классификатор OpenAI. Запущенный в январе 2023 года, он был закрыт через полгода с формулировкой «низкая точность»: по данным самой компании, он корректно определял лишь 26% сгенерированных текстов и при этом ошибочно помечал как ИИ 9% полностью человеческих.
Исследование Стэнфордского университета 2023 года (Liang et al., журнал Patterns) показало другую грань проблемы: 7 популярных детекторов пометили как сгенерированные 61% эссе TOEFL, написанных людьми, для которых английский не родной, — при почти безошибочном распознавании текстов носителей языка. Почти 20% таких эссе сочли сгенерированными сразу все 7 детекторов. Вывод исследователей: детектор, обученный на одном языковом профиле, систематически ошибается на нетипичных для него текстах. Для русскоязычных работ это прямой аргумент в пользу систем, обученных на русскоязычном корпусе. На этом же открытом наборе детектор Руконтекст не поставил пометку ни на одно из 91 эссе.
Эти проблемы актуальны не только для англоязычных текстов. Весна 2026 года показала, как та же дилемма проявилась в российской практике. После масштабного обновления ИИ-детектора одной из систем проверки студенческие работы начали массово получать пометки о генерации — включая полностью самостоятельные тексты. По данным самой системы, за I квартал 2026 года признаки ИИ были обнаружены в 27% студенческих работ против 17% годом ранее — но объяснялся этот скачок не столько реальным ростом использования нейросетей, сколько качеством модели и её калибровкой: детектор, который недостаточно уверенно отличает живой текст от машинного, при повышении чувствительности начинает «находить» ИИ там, где его нет. Ситуацию освещали федеральные СМИ: описаны случаи, когда самостоятельно написанная работа при первой проверке получала 96% «использования нейросетей», а студентка Кемеровского госуниверситета переписывала 90-страничный диплом 13 раз, потому что система продолжала метить текст как сгенерированный. Студенты обращались в Минобрнауки с просьбой пересмотреть подход к проверке, а Молодёжный парламент при Госдуме предложил создавать при вузах комиссии по разбору спорных случаев.
Технически это описанный выше компромисс: чувствительность подняли, а запаса базовой точности под неё не оказалось. Так ведёт себя любой детектор, у которого нет ни этого запаса, ни предохранительных механизмов, — вопрос лишь в том, на чьих текстах это проявится.
Как на это отвечает Руконтекст
Логика ИИ-детектора Руконтекст построена от цены ошибки. Система помечает только фрагменты с высокой вероятностью генерации и называет их подозрительными — это сигнал для проверяющего, а не приговор автору. Право снять пометку разграничено ролевой моделью: вручную отклонить флаг могут пользователи с ролью «Преподаватель», «Эксперт» и выше — те, кто отвечает за итоговое решение и располагает контекстом: знанием студента, темы и стиля его работы.

Отчёт по ИИ-генерации: кнопкой «Исключить» эксперт снимает пометку с фрагмента — исключённые фрагменты выделены серым и не учитываются в итоге
На практике это выглядит так: из порядка 400 тысяч работ, прошедших через систему за два месяца, пометку о возможной генерации получила примерно одна из 80. По каждой такой пометке решение принимал проверяющий. Обратная связь подтверждает точность пометок: в разборах студенты нередко признавали, что часть текста написала нейросеть.
Качество детекции напрямую зависит от обучающих данных. Специализация Руконтекста — русскоязычный корпус: модель обучена в первую очередь на текстах на русском языке и продолжает дообучаться по мере того, как нейросети пишут всё более «человеческим» языком.
«Детектор, который выносит приговор вместо эксперта, — это вердикт без судьи. Цена ложного обвинения для автора диссертации несоизмерима с ценой пропущенного фрагмента, поэтому судья в нашей системе есть всегда: последнее слово остаётся за человеком — преподавателем или экспертом» — Максим Дымков, генеральный директор компании, ООО «НЦР «Руконт».
Один механизм — разные ставки: от эссе до диплома
Технология детекции не различается по типам документов: к диплому, курсовой и короткому эссе применяется одна и та же модель. Различается цена ошибки — и именно поэтому в каждом сценарии важна роль эксперта.
Диплом: самая высокая ставка
Для выпускной квалификационной работы срабатывание детектора — самая высокая ставка: от результата зависит допуск к защите. Здесь особенно важно, что подозрительный фрагмент остаётся сигналом для проверяющего: пометка становится поводом для разговора научного руководителя со студентом. Санкции на её основании автоматически не наступают — решение по флагам принимают руководитель и комиссия.
Рефераты и курсовые: массовая задача
Для текущих учебных работ детектор решает массовую задачу: преподавателю физически не проверить вручную десятки текстов на признаки генерации. Выделение конкретных подозрительных фрагментов экономит главное — время: вместо чтения всей работы «с подозрением» преподаватель смотрит на выделенные места и принимает решение по ним.
Эссе и короткие тексты
Короткие тексты — отдельный вызов для любого детектора: чем меньше текста, тем меньше статистики для оценки. Порог срабатывания при этом один для всех типов работ и настроен консервативно — на коротком тексте система скорее промолчит, чем поставит спорную пометку. Для автора это значит, что эссе не проверяется строже диплома. Для проверяющего — что отсутствие флага на коротком тексте говорит меньше, чем на длинном.
За пределами вуза: рукописи и научные тексты
Детекторы используют и издательства с научными институтами — для рукописей, статей и отчётных материалов. Здесь ставка иная, чем в учебном процессе: репутационная. К этому добавляется этическая рамка: позиция COPE состоит в том, что нейросеть не может быть автором, а использование ИИ автор обязан раскрыть. Проверить полноту такого раскрытия редакция может только инструментально — отсюда и детектор в редакционном цикле. Принцип остаётся неизменным: система выделяет подозрительные фрагменты, решение принимает редактор или эксперт.
Вероятностная природа детекции не исчезнет с ростом качества моделей: чем естественнее пишут нейросети, тем осторожнее приходится формулировать выводы о происхождении текста. Поэтому задача системы проверки — не вынести вердикт, а дать эксперту точную картину: где именно текст выглядит машинным и насколько уверенно об этом можно говорить. Решение по этой картине принимает человек.
ERID: CQH36pWzJqVHyNTpLPc5KBWAzY3G6zwrBDPjVgJw3jEMiw
Реклама. ООО «НЦР «Руконт»
ИНН 7702823270
Рубрика: Инновационные технологии
Дата: 28-08-2026
Теги: Руконтекст поиск заимствований, антиплагиат ИИ-агенты ИИ-детекторы